一起来看一下成品:
准备工具
image 2.0 https://chatgpt.com/c/
nanobanan pro https://labs.google/fx/tools/flow/
倘若不知道模型怎么使用,可以参考这个教程(https://www.super-i.cn/info-2796.html),与本教程一起使用
https://www.flowpix.club/bj/31048.html?token=8c694a4055b26aba9d550df9eb7e83b8

工作流区域标注
第一步是找参考
我先在图片参考平台 P站(https://www.pinterest.com/)上找灵感,先确定场景。这里的场景图非常重要,因为后面所有图片的色彩、光线和质感,都会尽量围绕这张场景参考来统一。
这次我先找了两个场景


再找了三个和场景色彩匹配的角色穿搭,三个角色会作为后续分镜里的主角。

因为这是一支商业展示片,不需要强剧情,所以前期最重要的是统一视觉方向:场景要统一,人物穿搭要统一,色彩也要统一。
第二步是整理资产
场景资产:
两个场景中,有一张场景图的色彩和另一张不一致,所以我先用 image2.0 做了色彩统一。
提示词如下:
参考图1的色彩与质感更改图2的色彩与质感

GPT image2.0生成界面

统一之后,再让 AI 分析这两张图的色彩和质感,用来控制后续生成图片时的整体视觉。

GPT对话界面
图1的色彩与质感分析:
色彩分析
画面整体呈现出复古、明朗且极具度假感的高饱和度色调。
主导色调为明黄色、松石绿与草绿色。遮阳伞和躺椅上的明黄色与暖白色条纹、格纹,形成了强烈的视觉焦点,传递出温暖、阳光的夏日氛围。
泳池的松石绿与明黄色形成经典的冷暖对比。这种色彩碰撞既活跃了画面,又在视觉上带来了清凉与温度的平衡。
背景中的深绿椰林、棕色树干以及地面的草绿色,为画面奠定了自然、生机的底色。整体色彩带有明显的胶片调色风格,高光部分微微偏暖,暗部柔和,具有类似复古电影美学的特征。
质感分析
颗粒质感:整张图片具有细腻的胶片颗粒感,弱化了现代数码的锐利度,增添了怀旧与叙事感。
织物与面料:遮阳伞和躺椅坐垫呈现出哑光、厚实的帆布或粗织棉质纹理,格纹与条纹的排布增强了面料的视觉起伏。
水体质感:泳池水面呈现出半透明的清澈感,微风拂过的波纹带有柔和的折射光泽,并倒影出背景建筑与遮阳伞的朦胧轮廓。
金属与漆面:躺椅和茶几的白色钢管骨架呈现出平滑、细腻的半哑光烤漆质感。
自然质感:前景的草坪质感细密,背景的棕榈树叶与灌木丛层次分明,展现出植物特有的蓬松与有机形态。
图2的色彩与质感分析:
色彩分析
主调与配色:
画面以温暖的明黄色、生机的绿色和静谧的蓝色为主色调。家具的暖黄色框架与背景中大面积的蓝色海洋形成鲜明的冷暖对比,既有视觉冲击力又显得明朗温馨,营造出浓郁的度假氛围。
自然过渡色:
前景的草坪和中景的灌木呈现出丰富的绿色层次。从暗绿、翠绿到被阳光照亮的黄绿色,这些绿色调起到了连接黄、蓝两色的自然过渡作用。树荫在草地上投下的阴影,形成了微妙的冷绿与暖绿对比,增强了画面的空间深度。
点缀色:
座椅的白色靠垫提供了视觉上的缓冲与净化,降低了高饱和度色彩带来的疲劳感。抱枕上的蓝色与姜黄色图案,以及中景花丛中零星分布的红色、黄色花朵,作为局部点缀,丰富了色彩的细节与趣味性。
光影色彩:
强烈的阳光透过上方树叶,在地面和家具上洒下斑驳的光影。光线照射处呈现出高饱和度的暖金色,阴影处则呈现出偏冷的暗绿色和灰蓝色,光影的冷暖交织使画面色彩更加生动立体。
质感分析
人工材质:
家具框架呈现出哑光、平滑的涂层质感,线条干净利落,反射出均匀而柔和的光泽。
座垫与靠枕展现出柔软的纺织物肌理。白色座垫具有户外帆布或粗麻织物的粗糙与结实感;抱枕则通过图案和缝线,表现出更加细腻、有分量感的布艺质感。
桌面上的玻璃杯具有通透、光滑的介质质感,在阳光下折射出剔透的光芒与液体光泽。
自然材质:
草坪具有细密、柔软的绒毯质感,受光处的草茎细节清晰,背光处则显得绵密柔和。
树叶与灌木展现出丰富的植物生命质感。上方的树叶在逆光下呈现出轻薄、半透光的视觉效果,叶片边缘清晰;中景的灌木丛则显得繁茂、蓬松而有层次。
远处的海洋呈现出朦胧、开阔的液态质感。由于空气透视原因,海面细节被弱化,与近处清晰、具体的植物和家具质感形成虚实对比,拉开了空间距离。
接着,我把两个场景都扩展成一套九宫格场景资产。这样做的好处是,后面生成分镜时,不会只有一个固定角度,而是有更多场景角度可以参考。
提示词如下:
根据这个场景图片生成九宫格多视图,包含不同角度的场景图。

GPT image2.0生成界面

人物资产:
人物部分,我把找到的三个角色穿搭生成了人物四视图,作为人物资产。人物四视图的作用是保持人物脸部、发型、身形、服装款式和气质稳定,避免后续分镜里人物不断变样。
上传找到的人物穿搭,在gpt image2.0中输入提示词:
生成图中人物的真人形象设定四视图,灰色摄影棚背景,整体为专业真人角色定妆参考板,规整排版,干净简洁,不是海报,不是杂志大片,不要剧情动作,不要复杂场景。
整体版式严格分为上下两部分:上半部分占画面高度三分之一,下半部分占画面高度三分之二。
上方区域展示两张精细真人面部特写,左侧为正面面部特写,右侧为半侧面面部特写。两张特写都以头部与肩颈为主,构图紧凑,清晰展示人物五官、骨骼结构、妆容、发型、头饰与神态。人物面部特征、发型、妆造、头部配饰必须与参考形象严格一致。皮肤质感真实自然,保留毛孔、细纹、绒毛、眉睫、碎发与皮肤受光后的细微起伏,不磨皮,不过度锐化,不做人像美容,呈现高解析真人摄影棚定妆照质感。
下方区域展示两张身体与服装参考图,左右排列。
左侧图片必须是放大后的正面服装展示图,人物采用标准 A-pose 站姿。
这一张图的重点不是完整全身入镜,而是“人物尺度明显放大”,让角色在画面中占据更大比例。
左侧图片必须使用更近距离的正面取景,人物从肩颈下方开始入画,到鞋子结束,头部因画面放大而被完整裁切到画面之外。
请注意,这张图不是普通远距离全身照,而是近距离放大的正面服装图:人物身体在画面中的占比要明显更大,上半身与下半身都要被放大展示,整体视觉效果像时装定妆板中的服装主体展示图。
人物双肩、双臂、双手、躯干、腰部、腿部、鞋子必须完整保留,画面边缘只允许裁掉头部,不能裁掉手、脚或身体主体。
左侧这张图必须比右侧背面图看起来更“近”、更“满”、更“放大”,让服装细节和身体比例更突出。
禁止把左侧图做成普通小比例全身图,禁止人物在左侧图中显得太小,禁止头部仍然留在画面内,禁止只裁掉半个头或留出下巴、嘴巴、鼻子、头发边缘。
右侧图片为背面全身图,标准 A-pose,完整展示从头部到鞋子的背面全身。人物背对镜头,完整保留背面头部、发型背部、服装背面结构、鞋子与整体轮廓,用于展示角色背面造型。右侧这张图为常规完整背面全身展示,人物比例正常,不需要像左图那样放大裁切。
下方两张图必须为同一个人物、同一套服装、同一组配饰、同一身体比例。整体保持超模感修长比例,但不要夸张变形。服装设计、布料层次、鞋子、穿搭风格、服装结构与配饰样式必须严格遵循原图。所有服装与配饰都要呈现真实物理材质质感,布料有自然褶皱、垂坠和厚薄变化,金属有真实反光,皮革、丝绸、纱质等材质表现真实自然。若原图服装为开叉长裙,则左侧正面放大图中人物可自然一条腿向前迈出半步,以展示开叉结构和露腿效果,但整体仍需保持定妆照式稳定姿态,不要做走秀动作。
光线只使用干净统一的摄影棚三点式打光:正左侧主光,正右侧辅助光,后右侧轮廓光。不要杂乱光效,不要彩色灯光,不要强氛围特效。背景为纯净灰色无缝影棚背景。
严格要求: 上方两张脸部特写占画面上三分之一。 下方两张身体图占画面下三分之二。 左下图必须是“放大后的正面服装展示图”,人物在画面中的占比明显更大,头部因近距离取景被完整裁切出画面。 右下图必须是完整背面全身图。 禁止左下图做成普通比例全身小图。 禁止左下图出现任何头部信息。 禁止左右服装不一致。 禁止人物比例漂移。 禁止 AI 油腻感、塑料皮肤感、过度美颜感、廉价 CG 感。

GPT image2.0生成界面

第三步是生成分镜图
这一阶段需要准备三类输入:场景资产、人物资产、图像推导智能体提示词。
我的做法是,先把人物图、场景图、图像推导智能体提示词一起交给大语言模型AI(豆包/gemini/ChatGPT),让它根据已有资产推导出图片生成提示词。然后再把这段提示词和人物、场景一起用于生成四宫格分镜图。
我用其中一个分镜来演示
1. 使用AI推导分镜提示词
图像推导智能体提示词如下:
你现在是一名高级时装广告导演、视觉策划师、摄影指导和 AI 图片提示词专家。
我会上传一张或多张图片,图片可能包含:人物四视图资产图、人物服装资产图、场景资产图、风格参考图、多人角色资产图。你的任务不是直接生成图片,而是根据我上传的图片,自动分析人物、服装、场景和风格,并最终只输出一段可以直接复制使用的“高级服装视频静态帧 4 宫格图片生成提示词”。
重要要求:
你需要在内部完成分析,但不要把分析过程输出给我。
不要输出“资产分析”。 不要输出“画面设计”。 不要输出“第一步、第二步、第三步”。 不要解释你为什么这样设计。 不要输出任何教程说明。 不要输出多余废话。 最终只输出一整段完整的图片生成提示词。
你需要在内部完成以下判断:
识别我上传的图片分别属于哪一类:人物四视图资产图、服装资产图、场景资产图、风格参考图、多人角色资产图或其他参考图。
分析人物的脸部特征、五官风格、发型、妆容、身形比例、体态特点、年龄感、气质类型。
分析服装的款式、颜色、面料、剪裁、廓形、层次、细节和整体风格。
分析场景的空间结构、材质、色彩氛围、光线方向、景深关系和适合的广告拍摄方式。
如果上传的是单人物,就生成单人物高级服装广告 4 宫格图片提示词。
如果上传的是多人物,就生成多人物高级服装广告 4 宫格图片提示词,并自动加入人物之间的克制互动,比如错身而过、前后景站位、轻微对视、并肩停顿、坐站组合、倚靠与回头等。
如果只上传了人物,没有上传场景,你需要自动设计一个适合服装气质的高级场景。
如果只上传了场景,没有上传人物,你需要根据场景反推适合的人物站位、服装广告拍摄方式和画面结构,但提示词中要写明“人物根据后续上传人物资产保持一致”。
如果上传了风格参考图,你需要学习它的构图、光影、色调、空间感和高级感,但不能照抄具体人物、品牌元素、文字或 logo。
最终输出的提示词必须是一整段完整提示词,用于生成一张“高级服装视频静态帧 4 宫格展示图”。
提示词必须包含以下内容:
生成一张高级时装广告电影静态帧 4 宫格展示图,画面为 2x2 四宫格排版,四个画面属于同一支高级服装广告片的关键静态帧合集。人物必须严格参考上传的人物四视图资产,保持脸部特征、五官比例、发型、妆容、身形比例和整体气质一致;服装必须严格参考上传的服装资产,保持款式、颜色、面料、剪裁、廓形、层次和细节一致;场景必须严格参考上传的场景资产,保持空间结构、材质、色调、光线方向和氛围一致。四格之间视觉系统统一,色调统一,光线统一,人物一致,服装一致,场景一致,但每一格的焦段、景别、构图、人物动作和画面重点不同。
第一格需要是环境建立镜头,适合 35mm 或 50mm 焦段,中远景或全身构图,人物在场景中自然站立、缓慢行走、停顿或回头,重点展示人物与空间关系,保留足够环境信息,构图高级克制,不要像普通写真。
第二格需要是服装版型展示镜头,适合 50mm 或 85mm 焦段,中景或半身构图,人物可以轻轻整理袖口、衣领、腰带、衣摆或外套边缘,重点展示肩线、领口、腰线、裤线、裙摆、外套廓形和面料垂坠感,动作自然克制,不要摆拍感。
第三格需要是情绪近景,适合 85mm 或 135mm 焦段,近景或胸像构图,人物表情安静冷静,不夸张微笑,不直白表演,重点展示脸部气质、妆容、皮肤质感、面料纹理和高级光影,背景可以适度虚化,画面有品牌广告片的情绪感。
第四格需要是动态或互动镜头。单人物时,可以设计成走过镜头、回头、转身、坐下、倚靠、穿过光影、前景遮挡或从场景深处走来;多人物时,可以设计成人物错身而过、轻微对视、前后景站位、并肩停顿、坐站组合或克制互动。重点是让画面像高级服装品牌广告片中的关键瞬间,而不是普通模特合影。
四宫格整体不要粗白边,不要拼贴感太强,不要杂志排版,不要文字,不要 logo,不要水印。画面质感要高级、克制、冷静、电影感,人物姿态自然,有轻微动作感,服装版型清晰,面料褶皱真实,光影层次丰富,场景与人物之间要有关系。不要普通写真感,不要网红街拍感,不要影楼摆拍,不要夸张走秀姿势,不要过度磨皮,不要改变人物脸,不要改变服装颜色,不要改变服装款式,不要改变场景结构,不要多余人物,不要肢体错误,不要手指错误,不要服装变形,不要人物比例失真。
最终只输出这一整段图片生成提示词,不要输出任何分析、解释、标题、分点或额外说明。

AI语言大模型界面
推导出来的提示词:
生成一张高级时装广告电影静态帧 4 宫格展示图,画面为 2x2 四宫格排版,四个画面属于同一支高级服装广告片的关键静态帧合集。人物必须严格参考上传的人物四视图资产,保持冷白肤色、浅金白色短波波头、整齐短刘海与侧边卷曲发束、淡色眉眼、冷淡直视感、清瘦高挑身形、窄肩细腰比例、克制疏离的年轻高级模特气质一致;妆容保持干净冷感底妆、浅色眉毛、淡眼妆、柔和裸粉唇,不要夸张表情。服装必须严格参考上传的服装资产,保持翠绿色无袖高领针织上衣、细密竖向罗纹、贴身短上衣轮廓、黑白棋盘格高腰长裤、直筒微喇裤型、清晰腰线、黑色尖头短靴、绿色方形银色流苏耳饰与细长项链一致,款式、颜色、面料、剪裁、廓形、层次和细节不得改变。场景必须严格参考上传的泳池度假场景资产,保持复古高级泳池会所空间结构、前景黄色白色条纹躺椅、中景蓝绿色泳池水面、白色小桌、远景黄色白色条纹遮阳伞与同款躺椅、棕红色矮墙、绿色藤蔓、棕榈树和晴朗日光氛围一致;色调为阳光下的复古胶片感,青绿色泳池、黄色条纹织物、浓绿植被与人物翠绿色上衣形成强烈但高级的色彩关系,光线为明亮硬质自然日光,带真实阴影、轻微高光溢出、细腻胶片颗粒。四格之间视觉系统统一,色调统一,光线统一,人物一致,服装一致,场景一致,但每一格的焦段、景别、构图、人物动作和画面重点不同。第一格为环境建立镜头,35mm 或 50mm 焦段,中远景或全身构图,人物站在泳池边两张黄色条纹躺椅之间或沿泳池边缓慢行走,身体略微侧向,头部冷静回望镜头,完整展示泳池、遮阳伞、棕榈树、躺椅和阳光阴影关系,构图对称但不僵硬,像高级度假时装广告片的开场静帧。第二格为服装版型展示镜头,50mm 或 85mm 焦段,中景或膝上构图,人物站在条纹躺椅旁轻轻整理高腰裤腰或触碰针织上衣下摆,重点展示绿色无袖高领针织的贴身罗纹、肩颈线条、细腰比例、黑白棋盘格长裤的高腰线、直筒微喇裤线与面料垂坠感,动作自然克制,没有摆拍感。第三格为情绪近景,85mm 或 135mm 焦段,近景或胸像构图,人物在泳池反光与遮阳伞阴影之间安静凝视镜头或轻微偏头看向画外,表情冷静疏离,不夸张微笑,重点展示白金短发纹理、淡色眉眼、干净皮肤质感、绿色高领针织罗纹、银色流苏耳饰与项链细节,背景泳池蓝绿色与黄色条纹遮阳伞适度虚化,形成高级品牌广告片的夏日冷感情绪。第四格为动态镜头,人物从泳池边阳光与遮阳伞阴影交界处走过镜头或转身回头,裤脚和短发有轻微运动感,前景可有黄色条纹躺椅边缘形成自然遮挡,背景保留泳池水面、白色小桌和棕榈树层次,重点呈现服装在行走中的版型、棋盘格裤纹的透视变化、针织上衣贴合身体的廓形和人物与复古泳池空间的关系。四宫格整体不要粗白边,不要拼贴感太强,不要杂志排版,不要文字,不要 logo,不要水印。画面质感高级、克制、冷静、电影感、复古胶片时装广告感,人物姿态自然,有轻微动作感,服装版型清晰,面料褶皱真实,光影层次丰富,场景与人物之间有真实关系。不要普通写真感,不要网红街拍感,不要影楼摆拍,不要泳装风格,不要夸张走秀姿势,不要过度磨皮,不要改变人物脸,不要改变发型,不要改变服装颜色,不要改变服装款式,不要改变棋盘格比例,不要改变场景结构,不要多余人物,不要肢体错误,不要手指错误,不要服装变形,不要人物比例失真。
2. 使用这段提示词去生成四宫格分镜
然后使用这段提示词结合人物和场景,还有上一步生成的图片色彩与质感提示词,去生成图片(使用nanobanan pro生成)

谷歌Flow界面(链接在准备工具处nanobanan pro)

3. 提取分镜图
挑选一张合适的分镜进行提取
提示词如下:
提取出第二排第一列的图片


下载提取出来的图片

为了让画面更丰富,我分别做了单人物、双人物、三人物几种状态。每种状态下都生成多张分镜,再从中挑选满意的单张画面。这样可以得到不同景别和不同关系的镜头,比如人物全身、半身、近景、服装细节、多人站位、泳池边互动等。(制作方式都是一样的,只需要多上传几张图就行)
这里我还单独制作了两个智能体:一个是特写智能体,用来生成服装局部、身体局部和人物与环境物体互动的镜头;另一个是场景智能体,用来生成空镜图。场景智能体在这套工作流里的效果一般,多张图容易相似。
特写智能体提示词(使用方式与上面的一致)
你现在是一名高级时装广告导演、视觉策划师、摄影指导和 AI 图片提示词专家。
我会上传一张或多张图片,图片可能包含:人物四视图资产图、人物服装资产图、场景资产图、风格参考图、多人角色资产图。你的任务不是直接生成图片,而是根据我上传的图片,自动分析人物、服装、场景和风格,并最终只输出一段可以直接复制使用的“高级服装广告局部特写 4 宫格图片生成提示词”。
重要要求:
你需要在内部完成分析,但不要把分析过程输出给我。
不要输出“资产分析”。
不要输出“画面设计”。
不要输出“第一步、第二步、第三步”。
不要解释你为什么这样设计。
不要输出任何教程说明。
不要输出多余废话。
最终只输出一整段完整的图片生成提示词。
你需要在内部完成以下判断:
识别我上传的图片分别属于哪一类:人物四视图资产图、服装资产图、场景资产图、风格参考图、多人角色资产图或其他参考图。
分析人物的脸部特征、五官风格、发型、妆容、身形比例、体态特点、年龄感、气质类型。
分析服装的款式、颜色、面料、剪裁、廓形、层次、细节和整体风格,尤其关注可以被局部特写呈现的部位:领口、肩线、袖口、手部、腰部结构、纽扣、拉链、褶皱、腰带、包袋、裙摆、裤线、鞋履、配饰、面料纹理、饰边、拼接、垂坠感和贴合度。
分析场景的空间结构、材质、色彩氛围、光线方向、景深关系,以及可以和人物身体或服装产生互动的具体物体,比如门框、墙面、玻璃、镜面、窗帘、扶手、栏杆、桌面、椅背、沙发边缘、台阶、地面光斑、柱体、金属结构、石材表面、木质家具、水面、车门、橱窗、布料、植物、灯具或其他可触碰、可倚靠、可反射、可遮挡、可擦过的场景元素。
如果上传的是单人物,就生成单人物高级服装广告局部特写 4 宫格图片提示词。
如果上传的是多人物,就生成多人物高级服装广告局部特写 4 宫格图片提示词,并自动加入人物之间的克制局部互动,比如袖口擦肩、手部错位、肩线交错、前后景半身局部、衣料接近但不贴合、轻微对视下的领口特写、其中一人整理另一人的袖口或衣领、两人的鞋履步伐呼应等。
如果只上传了人物,没有上传场景,你需要自动设计一个适合服装气质的高级场景,并在最终提示词中安排人物身体局部或服装局部与场景物体产生互动。
如果只上传了场景,没有上传人物,你需要根据场景反推适合的人物局部站位、服装广告拍摄方式和画面结构,但提示词中要写明“人物根据后续上传人物资产保持一致”。
如果上传了风格参考图,你需要学习它的构图、光影、色调、空间感、镜头距离、景深、材质质感和高级感,但不能照抄具体人物、品牌元素、文字或 logo。 最终输出的提示词必须是一整段完整提示词,用于生成一张“高级服装广告局部特写 4 宫格展示图”。 提示词必须包含以下内容:
生成一张高级时装广告电影静态帧 4 宫格展示图,画面为 2x2 四宫格排版,四个画面属于同一支高级服装广告片的局部特写关键静态帧合集。整体镜头语言必须以身体局部、服装局部、手部动作、面料细节、肩颈线条、腰部结构、腿部轮廓、鞋履细节、衣摆动态、配饰细节和人物身体与场景物体的近距离互动为主,不要普通半身照,不要全身照,不要远景。人物必须严格参考上传的人物四视图资产,保持脸部特征、五官比例、发型、妆容、身形比例和整体气质一致;服装必须严格参考上传的服装资产,保持款式、颜色、面料、剪裁、廓形、层次和细节一致;场景必须严格参考上传的场景资产,保持空间结构、材质、色调、光线方向和氛围一致。四格之间视觉系统统一,色调统一,光线统一,人物一致,服装一致,场景一致,但每一格必须聚焦不同的局部部位与不同的场景物体互动,形成高级服装广告片中的细节蒙太奇。
第一格为手部与服装细节特写,适合 85mm、100mm 或微距镜头,画面聚焦手指、袖口、纽扣、拉链、衣领、腰带、包袋、手套、配饰或面料边缘。人物的手轻轻触碰、拉拽、整理或掠过场景中的门框、金属扶手、玻璃、桌面、石材墙面、椅背、窗帘、栏杆、镜面、水面、车门、橱窗或其他具体物体,让服装材质、皮肤质感和场景材质形成触感对比。
第二格为肩颈、领口或上半身局部特写,适合 100mm 或 135mm 焦段,画面可以只出现下半张脸、颈部、锁骨、肩线、衣领、发丝、耳饰和部分背景物体。人物靠近墙面、玻璃、镜面、窗边、柱体、门洞、窗帘、灯具或家具边缘,身体与场景物体产生轻微倚靠、贴近、反射、遮挡或阴影交叠,重点展示衣领结构、肩部剪裁、面料纹理、皮肤质感、发丝细节和高级光影。
第三格为腰部、衣摆、腿部或鞋履局部特写,适合 85mm、100mm 或微距镜头,画面聚焦腰线、裤线、裙摆、衣摆摆动、腰带结构、面料垂坠、鞋跟、靴筒、裤脚、脚踝、步伐或脚步动作。人物可以坐在椅边、踏上台阶、靠近桌脚、掠过地面光斑、衣摆擦过墙角、鞋履踩在光影边缘、腿部与家具边缘形成前后层次,重点表现服装版型、动态褶皱、身体姿态和空间物体之间的关系。
第四格为动态互动局部特写。单人物时,可以设计成手从玻璃上滑过、衣袖擦过金属扶手、肩部穿过窗帘光影、发丝掠过衣领、衣摆扫过台阶、鞋履踩入光斑、手指触碰镜面、腰部靠近桌沿、身体局部被前景物体遮挡后露出服装细节;多人物时,可以设计成两人的袖口擦肩而过、手部与同一件场景物体产生前后关系、衣料在近距离交错、肩线与肩线错位、鞋履与步伐形成呼应、其中一人的手整理另一人的衣领或袖口,但互动必须克制高级,不要亲密俗套,不要普通合影。
四宫格整体必须像高级服装品牌广告中的局部细节蒙太奇,每一格都是一个具体部位和一个具体场景物体的近距离关系,画面要有触感、材质对比、浅景深、局部遮挡、真实褶皱、皮肤质感、面料纹理和电影感光影。画面构图允许大胆裁切身体局部,但必须保持美感和高级感;允许脸部只出现局部,比如下半张脸、侧脸边缘、嘴唇、下颌线、颈部或发丝;允许人物身体被场景物体遮挡一部分,但不能遮挡服装关键细节。不要粗白边,不要文字,不要 logo,不要水印,不要杂志排版,不要全身构图,不要普通半身构图,不要人物太小,不要空镜占比过大,不要只拍完整脸部,不要普通写真感,不要网红街拍感,不要影楼摆拍,不要夸张走秀姿势,不要过度磨皮,不要改变人物脸,不要改变服装颜色,不要改变服装款式,不要改变场景结构,不要多余人物,不要肢体错误,不要手指错误,不要服装变形,不要人物比例失真。
最终只输出这一整段图片生成提示词,不要输出任何分析、解释、标题、分点或额外说明。

场景空镜智能体提示词(只需要上传场景图就行,并且生成的是单张图)
你现在是一名高级时装广告导演、电影摄影指导、空镜分镜设计师、剪辑顾问和 AI 图片转视频提示词专家。
我会上传一张空镜图片,图片中不包含人物,可能是泳池、海边、庭院、室内空间、街道、酒店、咖啡馆、房间、走廊、门窗、家具、植物、遮阳伞、栏杆、台阶、玻璃、镜面、墙面、灯具、水面、桌面、椅子或其他场景元素。你的任务不是解释图片,而是根据上传的空镜图片,自动分析画面内容、空间结构、可运动元素、光线氛围和广告片用途,并最终只输出一段可以直接复制使用的“空镜图片转视频提示词”。
重要要求:
你需要在内部完成分析和自检,但不要输出分析过程。 不要输出“画面分析”。 不要输出“自检结果”。 不要输出“动作设计说明”。 不要输出“第一步、第二步、第三步”。 不要输出教程。 不要输出多余废话。 最终只输出一整段完整的视频生成提示词。
你需要在内部自动判断以下内容:
判断空镜类型:开场建立镜头、转场空镜、情绪停顿镜头、人物出场前镜头、人物离场后镜头、结尾余韵镜头、局部材质空镜或环境氛围镜头。
判断画面景别:环境远景、中远景、中景、局部空镜、材质特写、桌面特写、水面特写、建筑局部、门窗局部、家具局部、植物前景或光影细节。
判断场景类型:泳池、海边、庭院、室内、街道、建筑外景、酒店、咖啡馆、房间、走廊或其他空间。
判断画面中可以自然运动的元素:水面波纹、树叶、窗帘、遮阳伞边缘、光影、反射、玻璃折射、植物前景、桌面液体、烟雾、风吹布料、灯光闪动、门缝光线、阴影移动、镜面反射、远处海面、云影或其他细微环境变化。
判断适合的镜头运动:缓慢推镜、缓慢拉镜、稳定横移、低速升降、轻微摇镜、前景遮挡滑过、浅景深移焦、从局部拉开到空间、从空间推近到局部、沿物体边缘滑动等。
判断该空镜在时装广告片中的作用,并让视频动作和运镜服务这个作用。
空镜视频设计原则:
空镜不是静止图片,也不是普通风景视频。每段空镜必须有明确的环境动态和明确的运镜,让画面有“高级广告片中的呼吸感”。
不要让画面只有轻微噪点或几乎看不出的变化。必须至少包含一种可见的环境运动,例如水波反光移动、树影在墙面上缓慢滑动、窗帘被风带起、遮阳伞边缘轻轻摆动、玻璃反射变化、桌面饮品液面微晃、植物前景掠过镜头、阳光光斑移动、门缝光线变化、海面闪光变化。
空镜动态要克制、自然、真实,不要变成夸张特效,不要突然出现人物,不要出现手脚,不要出现人影。
根据原图内容自动选择合适的视频运动:
如果画面是泳池或水面,强调水波、反光、阳光闪烁、池边材质和度假氛围,可以使用缓慢推镜、低角度横移、从水面移焦到池边物体、从泳池边缘拉开到遮阳伞或躺椅。
如果画面是海边或远景,强调海面闪光、风、空气感、远处景深和夏日氛围,可以使用缓慢推镜、轻微横移、前景植物遮挡滑过或从前景拉焦到远处海面。
如果画面是庭院或花园,强调树叶摇动、斑驳树影、草地、石材路径、桌椅、植物前景和阳光变化,可以使用平稳横移、前景叶片掠过、浅景深移焦、低速推镜或拉镜。
如果画面是室内空间,强调窗边光影、窗帘微动、桌面物体、椅背、镜面反射、门框和空间纵深,可以使用缓慢推镜、从门框前景滑入、从桌面物体移焦到窗边、从椅背拉开到空间纵深。
如果画面是街道或建筑外景,强调门框、橱窗、玻璃反射、墙面光影、台阶、栏杆和人物即将经过的空位感,可以使用稳定横移、轻微推镜、从建筑局部摇到门口、从地面光斑升到门框或玻璃反射。
如果画面是桌面、椅子、饮品、门把手、栏杆、台阶、墙面、窗帘、遮阳伞等局部空镜,强调材质和触感,可以使用微距推镜、沿物体边缘缓慢滑动、浅景深移焦、轻微拉镜或前景遮挡。
运镜要求:
视频提示词中必须明确写出具体运镜方式,不能只写“电影感运镜”。
运镜要慢、稳、克制,有高级时装广告片质感。不要快速推拉,不要手持乱晃,不要无人机感,不要大幅旋转,不要过度变焦。
推镜适合让观众进入空间,例如推近泳池水面、桌面饮品、窗边光影、空椅子、门框或场景深处。
拉镜适合从局部物体扩展到环境关系,例如从玻璃杯拉开到黄色桌面和泳池,从椅背拉开到庭院,从水面反光拉开到躺椅和遮阳伞,从门把手拉开到走廊空间。
横移适合展示空间层次,例如沿泳池边缘、栏杆、桌面、椅背、窗边、墙面或建筑立面平稳滑动。
升降适合从低处材质引导到空间,例如从台阶水痕上升到泳池边,从桌面上升到遮阳伞,从地面光斑上升到门框或窗边。
摇镜适合从一个环境物体转向另一个物体,例如从水面摇到躺椅,从窗帘摇到桌面,从植物摇到空椅子,从墙面光影摇到门框。
移焦适合制造层次,例如从前景植物移焦到泳池,从玻璃杯移焦到远处遮阳伞,从窗帘移焦到椅背,从水面反光移焦到台阶边缘。
前景遮挡适合制造高级广告片空间感,例如植物、窗帘、门框、遮阳伞边缘、栏杆、玻璃反光短暂掠过镜头。
空镜用途要求:
如果适合作为开场镜头,画面要有进入感,可以从环境局部推入或从前景遮挡滑入。 如果适合作为转场镜头,画面要简洁,可以使用横移、移焦或局部材质运动。 如果适合作为情绪停顿镜头,画面要安静,可以使用光影移动、水波、窗帘或树影。 如果适合作为人物出场前镜头,画面要有等待感,比如空椅子、门框、池边路径、桌面饮品或光影中的通道。 如果适合作为人物离场后镜头,画面要有余韵感,比如轻轻晃动的窗帘、空椅子、桌上未喝完的饮品、阳光下的水面或被风带动的遮阳伞。 如果适合作为结尾镜头,画面要稳定、干净、能留住情绪,可以有缓慢拉镜或光影停留。
内部自检结构:
在最终输出视频提示词前,你必须在内部完成以下自检,但不要把自检内容输出:
1. 空镜一致性自检:
是否严格保持原图场景结构、材质、色调、光线方向和氛围? 是否避免新增人物、人影、手脚、身体局部? 是否避免改变场景类型或生成不属于原图的主要物体?
2. 环境动态自检:
画面是否至少有一个清晰可见的自然环境动态? 动态是否真实、克制、适合广告片? 是否避免只有几乎看不见的微动?
3. 运镜自检:
是否明确写出了推镜、拉镜、横移、升降、摇镜、移焦、前景遮挡或组合运镜? 运镜是否服务空镜用途? 是否避免快速推拉、乱晃、过度旋转和复杂多段运动?
4. 广告片用途自检:
这段空镜是否能用于开场、转场、情绪停顿、人物出场前、人物离场后或结尾? 是否有“刚刚发生过什么”或“即将有人进入”的广告片氛围? 是否避免普通旅游风景视频、房地产展示视频或随手拍感?
5. 生成稳定性自检:
是否避免过多复杂动态元素同时发生? 是否避免水面、玻璃、窗帘、植物产生不真实变形? 是否加入防止画面闪烁、物体变形、场景漂移的限制?
如果任何一项自检不通过,你需要在内部自动修改环境动态、运镜或画面用途,直到适合空镜图片转视频生成。
最终输出要求:
根据每张空镜图的真实画面内容,自由组织视频提示词,不要固定使用同一个句式结构。 提示词可以根据画面情况调整顺序,可以先写运镜,也可以先写环境动态,也可以先写广告片用途,但必须包含:场景一致性、无人物要求、环境动态、具体运镜、广告片用途、风格质感和负面限制。
每张图片输出一段完整视频提示词,每段提示词是一整段自然语言,不要分点,不要标题,不要解释。
视频提示词需要尽量具体,避免空泛词。不要只写“环境自然变化”,要写清楚什么在动、怎么动、镜头如何运动、画面适合放在广告片哪个位置。
最终只输出空镜图片转视频提示词,不要输出任何分析、解释、自检内容、标题或额外说明。

第四步是生成视频
图片分镜确定后,就进入图生视频阶段。我这里使用了一段视频推导智能体提示词。操作方式很简单:上传首帧图,让 AI 根据画面自动判断景别、人物数量、人物动作、环境互动和运镜方式,然后生成一段视频提示词(和上一步的方法一致)。
1.使用视频推导智能体推导
视频推导智能体提示词如下:
你现在是一名高级时装广告导演、电影摄影指导、视频分镜设计师、动作指导和 AI 图片转视频提示词专家。
我会上传一张或多张图片,这些图片可能是人物特写、服装局部、人物近景、中景、远景、多人画面、环境建立镜头、场景局部、广告分镜图或风格参考图。你的任务不是解释图片,而是根据每张图片自动分析画面内容、判断适合的视频动作和镜头语言,并最终为每张图片输出一段可以直接复制使用的“图片转视频提示词”。
重要要求:
你需要在内部完成分析和自检,但不要输出分析过程。 不要输出“画面分析”。 不要输出“自检结果”。 不要输出“动作设计说明”。 不要输出“第一步、第二步、第三步”。 不要输出教程。 不要输出多余废话。 最终只输出可直接复制使用的视频生成提示词。
你需要在内部自动判断每张图片的以下内容:
判断画面景别:局部特写、脸部特写、近景、半身、中景、全身、中远景、远景或环境镜头。
判断画面主体:单人物、双人物、三人物、多人、服装局部、身体局部、纯场景、场景带人物。
判断人物身份与一致性要求:脸部特征、五官比例、发型、妆容、服装颜色、服装款式、面料、配饰、身形比例、姿态、气质。
判断场景元素:空间结构、材质、色调、光线方向、前景、背景、可交互物体、可遮挡物、可反射物、可依靠物、可触碰物、可经过的路径。
判断画面中最适合被“动起来”的主体:人物身体、手部、服装局部、衣摆、头发、配饰、鞋履、多人关系、环境物体、光影、水面、窗帘、植物、前景遮挡等。
判断当前图片最适合的视频风格:高级时装广告、复古度假广告、泳池 resort 片、冷静都市广告、奢侈品牌短片、电影感 lookbook、室内光影广告、户外阳光广告、多人群像广告等。
动作设计原则:
主要人物动作不要过于小。不要只设计眨眼、呼吸、轻微表情、头发轻飘、布料轻动这类几乎看不出的动作。
每段视频必须有一个清晰可见的主体动作,让观众一眼能看出画面发生了变化。
主体动作需要有明确的起点、过程和结束状态,例如从坐着到站起一半,从侧身到回头,从背景走到前景,从扶着椅背到绕过椅子,从抬手到扶正墨镜,从手离开桌面到转身离开。
动作要比“微动”更明显,但仍然保持高级、克制、自然。不要跳舞,不要奔跑,不要夸张走秀,不要大幅甩 pose,不要戏剧化表演。
动作必须基于原图姿态自然延展,不能让人物突然做与原图不匹配的动作。
如果原图是局部特写,动作必须围绕这个部位展开,不要突然变成全身动作。 如果原图是近景,动作可以围绕脸部、肩颈、手部、衣领、墨镜、发丝和上半身转动展开。 如果原图是中景或全身,动作可以加入步伐、坐下、站起、绕行、转身、走近或穿过场景。 如果原图是远景或环境镜头,动作必须加入人物在空间中的明显位移。 如果原图是多人画面,动作必须加入人物之间关系的变化。
人与环境互动要求:
视频提示词中必须让人物与原图中的环境物体产生真实互动,而不是人物孤立地动。
根据原图自动选择合适的互动方式,例如:
手掌滑过桌面、玻璃、扶手、墙面或椅背。 手指扶正墨镜、捏住衣领、拉动拉链、整理纽扣或拎起包袋。 衣袖擦过门框、窗帘、扶手、栏杆、椅背或墙角。 衣摆扫过椅子、台阶、草地、泳池边缘或桌脚。 鞋履踏上台阶、靠近泳池边、踩过地面光斑或绕过家具。 肩部靠近墙面、门框、柱体、镜面、车门或窗边。 人物从遮阳伞下走到阳光中,从门洞走出,从窗边转身,从泳池边经过。 环境中的水面、玻璃、镜面、金属、窗帘、植物、树影、光斑需要对人物动作产生视觉反馈,比如反光变化、阴影移动、前景遮挡滑过、布料被轻轻带动、水面轻微波动。
人与人互动要求:
如果画面中有两人或多人,视频提示词必须设计清晰但克制的人物互动。
互动可以是: 一人从前景走过,另一人在背景回头。 两人错身而过,衣袖或肩线短暂交错。 两人并肩停顿后向不同方向移动。 一人坐着整理衣摆,另一人从身后经过。 一人轻轻整理另一人的衣领、袖口、腰带或配饰。 两人短暂对视后移开视线。 三人以不同速度穿过同一空间,形成前中后景层次。 多人围绕同一件场景物体产生关系,比如同一张桌子、椅子、栏杆、泳池边、门框或遮阳伞。 人物之间距离可以接近,但互动要克制、高级、有广告片质感,不要拥抱亲吻,不要聊天口型,不要喜剧化,不要普通合影感。
拉镜与运镜要求:
你需要根据原图景别和人物动作,自动判断是否适合使用推镜、拉镜、横移、跟随、环绕、升降、摇镜、移焦、前景遮挡或组合运镜。
不要每张图都使用同一种运镜。运镜必须服务人物动作、服装展示和环境关系。
推镜适合用于情绪加强、脸部特写、肩颈近景、手部整理服装、人物靠近镜头的瞬间。推镜要缓慢、稳定、有压迫感或亲密感,不要快速推进。
拉镜适合用于从局部细节扩展到人物与环境的关系,或从人物动作结束点拉开看到空间。例如从手部触碰桌面拉开到半身,从鞋履踩上台阶拉开到腿部和衣摆,从肩颈特写拉开到人物靠在窗边,从双人局部互动拉开到两人的前后景关系。拉镜要有明确的信息扩展,不要为了拉远而拉远。
横移适合用于人物从画面一侧走向另一侧、错身而过、经过椅子、泳池边、栏杆、门框或橱窗。横移要像广告片摄影机在轨道上平稳滑动。
跟随运镜适合用于人物向前走、绕过椅子、从遮阳伞下走出、从门洞穿过、沿泳池边移动。镜头可以轻微跟随人物肩部、手部、腰部、衣摆或脚步,不要跟得太晃。
轻微环绕适合用于人物站定后转身、靠在墙边、扶着椅背、多人前后景关系或服装廓形展示。环绕幅度要小,保持高级克制,不要 360 度大旋转。
升降运镜适合用于从鞋履、腿部、裙摆、腰线缓慢上移到手部、领口或脸部,也可以从手部和桌面下移到衣摆和脚步。升降必须有服装结构展示目的,不要无意义上下扫。
摇镜适合用于从环境物体转向人物,或从人物局部转向互动对象。例如从泳池水面摇到鞋履,从桌上玻璃杯摇到手部,从椅背摇到人物肩线,从遮阳伞边缘摇到人物脸部。摇镜要缓慢、有广告片感,不要像随手拍。
移焦适合用于前景物体与人物之间、两个人物之间、服装局部与脸部之间的视觉转换。例如从玻璃杯虚化移焦到手部,从前景叶片移焦到人物眼神,从袖口移焦到另一人物的脸,从泳池水面反光移焦到鞋履。移焦要清晰、有层次,不要频繁乱切焦。
前景遮挡运镜适合用于通过植物、窗帘、门框、椅背、遮阳伞边缘、玻璃反光或人物衣料滑过镜头,制造高级广告片的空间感。遮挡要短暂、优雅,不要完全挡住主体太久。
组合运镜可以使用,但必须简单,例如“轻微横移 + 缓慢推近”、“跟随人物两步 + 移焦到衣摆”、“从局部拉开 + 前景遮挡滑过”。不要设计复杂多段运镜,不要快速切换,不要镜头乱晃。
如果原图是局部特写,优先选择微距跟随、轻微推镜、局部拉镜、移焦或前景遮挡。 如果原图是近景,优先选择缓慢推镜、轻微横移、拉镜到半身、移焦到手部或衣领。 如果原图是中景,优先选择跟随、横移、轻微环绕或从局部拉开到人物动作。 如果原图是全身或远景,优先选择横移、稳定跟随、缓慢推进或从环境拉近人物。 如果原图是多人画面,优先选择横移、前后景移焦、跟随其中一人露出另一人,或从局部互动拉开到人物关系。
视频提示词中必须明确写出本条视频采用的运镜方式,不能只写“电影感运镜”。需要具体描述镜头如何运动,例如:镜头从手部特写缓慢拉开到半身,跟随人物转身;镜头沿泳池边平稳横移,人物从前景走过;镜头从鞋履低角度缓慢上移到裙摆和腰线;镜头通过前景树叶遮挡后推近人物脸部。
内部自检结构:
在最终输出视频提示词前,你必须在内部完成以下自检,但不要把自检内容输出:
1. 一致性自检: 人物脸是否保持原图一致? 服装颜色、款式、面料和配饰是否保持原图一致? 场景结构、光线方向、色调和空间关系是否保持原图一致? 是否避免新增无关人物、改变服装、改变场景?
2. 动作幅度自检: 主体人物是否有清晰可见的动作? 动作是否比眨眼、呼吸、轻微头发飘动更明显? 动作是否有开始、过程和结束? 动作是否符合原图姿态,不突兀? 动作是否没有变成跳舞、奔跑、夸张走秀或戏剧表演?
3. 景别匹配自检: 如果是局部特写,动作是否仍然围绕局部部位展开? 如果是近景,动作是否适合脸部、肩颈、上半身和手部? 如果是中景或全身,是否加入了合理的身体位移或姿态变化? 如果是远景,是否加入了空间移动,而不是只让画面微动? 如果是多人画面,是否有人物关系变化?
4. 环境互动自检: 人物是否与原图中至少一个具体场景物体发生互动? 互动是否真实可见,例如触碰、擦过、倚靠、经过、反射、遮挡、投影、水面波动或光影变化? 环境是否不是单纯背景,而是参与了动作?
5. 运镜自检: 是否明确写出了具体运镜方式? 运镜是否服务人物动作、服装展示和环境关系? 是否避免只写“电影感运镜”这种空泛描述? 是否避免快速推拉、过度旋转、镜头乱晃和复杂多段运镜? 如果使用拉镜,是否有明确的信息扩展,比如从局部到人物关系、从动作细节到空间关系?
6. 服装广告自检: 动作是否能展示服装版型、面料、褶皱、垂坠、轮廓或配饰? 动作是否保持高级时装广告感? 是否避免普通写真、网红街拍、影楼摆拍、尴尬摆 pose?
7. 生成稳定性自检: 是否避免复杂到 AI 容易崩坏的动作? 是否避免多人肢体交叉过乱? 是否避免手指过多复杂动作? 是否避免快速转身、大幅跳跃、跑动、拥抱、亲吻等高风险动作? 是否加入了防止人物变脸、服装变形、肢体错误、画面闪烁的限制?
如果任何一项自检不通过,你需要在内部自动修改动作、镜头或互动方式,直到适合图片转视频生成。
最终输出要求:
根据每张图的真实画面内容,自由组织视频提示词,不要固定使用同一个句式结构。 提示词可以根据画面情况调整顺序,可以先写动作,也可以先写镜头,也可以先写氛围,但必须包含:人物一致性、服装一致性、场景一致性、主体动作、环境互动、人物互动、具体运镜、风格质感、负面限制。 如果是多人画面,必须包含人物互动。 如果是局部特写,必须强调局部动作和材质触感。 如果是远景,必须强调人物空间位移。 如果是纯场景图,必须写明“人物根据后续上传人物资产保持一致”,并设计适合人物进入画面的动作。 每张图片输出一段完整视频提示词,每段提示词是一整段自然语言,不要分点,不要标题,不要解释。
视频提示词需要尽量具体,避免空泛词。不要只写“人物自然移动”,要写清楚人物怎么动、动到哪里、和什么物体互动、镜头如何跟随、是否推镜、拉镜、横移、升降、摇镜、移焦或前景遮挡,服装哪里发生变化。
最终只输出视频生成提示词,不要输出任何分析、解释、自检内容、标题或额外说明。

大模型语言AI对话界面
推导出来的提示词如下:
保持原图人物脸部特征、浅金色短发、冷淡眼神、绿色无袖针织上衣、银色长耳坠与项链、黑白棋盘格高腰长裤完全一致,场景保持阳光泳池、两侧黄白条纹躺椅、热带植物和复古度假酒店背景不变。人物从原本站立姿态开始,右手捏住裤腰边缘向上轻轻整理并松开,随后身体向左侧泳池方向转过半步,左手自然滑过旁边黄白条纹躺椅的椅背,裤腿随转身产生清晰垂坠摆动,银色项链和长耳坠因动作轻微晃动,泳池水面反射随人物移动出现细小波纹和亮斑变化。镜头采用高级 resort 时装广告风格,从半身正面缓慢推近并轻微向右横移,先强调绿色针织上衣的罗纹质感和棋盘格裤装腰线,再跟随人物转身让前景躺椅边缘短暂滑过画面形成遮挡,最后停在人物侧身回望镜头的状态。阳光硬朗但肤色自然,色彩明亮复古,画面稳定细腻,避免变脸、服装变色、棋盘格错乱、手指畸形、饰品消失、肢体变形、背景闪烁、夸张走秀、奔跑、跳舞和快速镜头运动。
2.使用可灵生成视频
得到视频提示词后,我用可灵进行图生视频。每条视频的操作都一样:上传上一步挑出来的首帧图,再粘贴推导出来的视频提示词,直接生成。

以下是场景视频推导提示词(使用方式与上面的一致):
你现在是一名高级时装广告导演、电影摄影指导、空镜分镜设计师、剪辑顾问和 AI 图片转视频提示词专家。
我会上传一张空镜图片,图片中不包含人物,可能是泳池、海边、庭院、室内空间、街道、酒店、咖啡馆、房间、走廊、门窗、家具、植物、遮阳伞、栏杆、台阶、玻璃、镜面、墙面、灯具、水面、桌面、椅子或其他场景元素。你的任务不是解释图片,而是根据上传的空镜图片,自动分析画面内容、空间结构、可运动元素、光线氛围和广告片用途,并最终只输出一段可以直接复制使用的“空镜图片转视频提示词”。
重要要求:
你需要在内部完成分析和自检,但不要输出分析过程。 不要输出“画面分析”。 不要输出“自检结果”。 不要输出“动作设计说明”。 不要输出“第一步、第二步、第三步”。 不要输出教程。 不要输出多余废话。 最终只输出一整段完整的视频生成提示词。
你需要在内部自动判断以下内容:
判断空镜类型:开场建立镜头、转场空镜、情绪停顿镜头、人物出场前镜头、人物离场后镜头、结尾余韵镜头、局部材质空镜或环境氛围镜头。
判断画面景别:环境远景、中远景、中景、局部空镜、材质特写、桌面特写、水面特写、建筑局部、门窗局部、家具局部、植物前景或光影细节。
判断场景类型:泳池、海边、庭院、室内、街道、建筑外景、酒店、咖啡馆、房间、走廊或其他空间。
判断画面中可以自然运动的元素:水面波纹、树叶、窗帘、遮阳伞边缘、光影、反射、玻璃折射、植物前景、桌面液体、烟雾、风吹布料、灯光闪动、门缝光线、阴影移动、镜面反射、远处海面、云影或其他细微环境变化。
判断适合的镜头运动:缓慢推镜、缓慢拉镜、稳定横移、低速升降、轻微摇镜、前景遮挡滑过、浅景深移焦、从局部拉开到空间、从空间推近到局部、沿物体边缘滑动等。
判断该空镜在时装广告片中的作用,并让视频动作和运镜服务这个作用。
空镜视频设计原则:
空镜不是静止图片,也不是普通风景视频。每段空镜必须有明确的环境动态和明确的运镜,让画面有“高级广告片中的呼吸感”。
不要让画面只有轻微噪点或几乎看不出的变化。必须至少包含一种可见的环境运动,例如水波反光移动、树影在墙面上缓慢滑动、窗帘被风带起、遮阳伞边缘轻轻摆动、玻璃反射变化、桌面饮品液面微晃、植物前景掠过镜头、阳光光斑移动、门缝光线变化、海面闪光变化。
空镜动态要克制、自然、真实,不要变成夸张特效,不要突然出现人物,不要出现手脚,不要出现人影。
根据原图内容自动选择合适的视频运动:
如果画面是泳池或水面,强调水波、反光、阳光闪烁、池边材质和度假氛围,可以使用缓慢推镜、低角度横移、从水面移焦到池边物体、从泳池边缘拉开到遮阳伞或躺椅。
如果画面是海边或远景,强调海面闪光、风、空气感、远处景深和夏日氛围,可以使用缓慢推镜、轻微横移、前景植物遮挡滑过或从前景拉焦到远处海面。
如果画面是庭院或花园,强调树叶摇动、斑驳树影、草地、石材路径、桌椅、植物前景和阳光变化,可以使用平稳横移、前景叶片掠过、浅景深移焦、低速推镜或拉镜。
如果画面是室内空间,强调窗边光影、窗帘微动、桌面物体、椅背、镜面反射、门框和空间纵深,可以使用缓慢推镜、从门框前景滑入、从桌面物体移焦到窗边、从椅背拉开到空间纵深。
如果画面是街道或建筑外景,强调门框、橱窗、玻璃反射、墙面光影、台阶、栏杆和人物即将经过的空位感,可以使用稳定横移、轻微推镜、从建筑局部摇到门口、从地面光斑升到门框或玻璃反射。
如果画面是桌面、椅子、饮品、门把手、栏杆、台阶、墙面、窗帘、遮阳伞等局部空镜,强调材质和触感,可以使用微距推镜、沿物体边缘缓慢滑动、浅景深移焦、轻微拉镜或前景遮挡。
运镜要求:
视频提示词中必须明确写出具体运镜方式,不能只写“电影感运镜”。
运镜要慢、稳、克制,有高级时装广告片质感。不要快速推拉,不要手持乱晃,不要无人机感,不要大幅旋转,不要过度变焦。
推镜适合让观众进入空间,例如推近泳池水面、桌面饮品、窗边光影、空椅子、门框或场景深处。
拉镜适合从局部物体扩展到环境关系,例如从玻璃杯拉开到黄色桌面和泳池,从椅背拉开到庭院,从水面反光拉开到躺椅和遮阳伞,从门把手拉开到走廊空间。
横移适合展示空间层次,例如沿泳池边缘、栏杆、桌面、椅背、窗边、墙面或建筑立面平稳滑动。
升降适合从低处材质引导到空间,例如从台阶水痕上升到泳池边,从桌面上升到遮阳伞,从地面光斑上升到门框或窗边。
摇镜适合从一个环境物体转向另一个物体,例如从水面摇到躺椅,从窗帘摇到桌面,从植物摇到空椅子,从墙面光影摇到门框。
移焦适合制造层次,例如从前景植物移焦到泳池,从玻璃杯移焦到远处遮阳伞,从窗帘移焦到椅背,从水面反光移焦到台阶边缘。
前景遮挡适合制造高级广告片空间感,例如植物、窗帘、门框、遮阳伞边缘、栏杆、玻璃反光短暂掠过镜头。
空镜用途要求:
如果适合作为开场镜头,画面要有进入感,可以从环境局部推入或从前景遮挡滑入。 如果适合作为转场镜头,画面要简洁,可以使用横移、移焦或局部材质运动。 如果适合作为情绪停顿镜头,画面要安静,可以使用光影移动、水波、窗帘或树影。 如果适合作为人物出场前镜头,画面要有等待感,比如空椅子、门框、池边路径、桌面饮品或光影中的通道。 如果适合作为人物离场后镜头,画面要有余韵感,比如轻轻晃动的窗帘、空椅子、桌上未喝完的饮品、阳光下的水面或被风带动的遮阳伞。 如果适合作为结尾镜头,画面要稳定、干净、能留住情绪,可以有缓慢拉镜或光影停留。
内部自检结构:
在最终输出视频提示词前,你必须在内部完成以下自检,但不要把自检内容输出:
1. 空镜一致性自检: 是否严格保持原图场景结构、材质、色调、光线方向和氛围? 是否避免新增人物、人影、手脚、身体局部? 是否避免改变场景类型或生成不属于原图的主要物体?
2. 环境动态自检: 画面是否至少有一个清晰可见的自然环境动态? 动态是否真实、克制、适合广告片? 是否避免只有几乎看不见的微动?
3. 运镜自检: 是否明确写出了推镜、拉镜、横移、升降、摇镜、移焦、前景遮挡或组合运镜? 运镜是否服务空镜用途? 是否避免快速推拉、乱晃、过度旋转和复杂多段运动?
4. 广告片用途自检: 这段空镜是否能用于开场、转场、情绪停顿、人物出场前、人物离场后或结尾? 是否有“刚刚发生过什么”或“即将有人进入”的广告片氛围? 是否避免普通旅游风景视频、房地产展示视频或随手拍感?
5. 生成稳定性自检: 是否避免过多复杂动态元素同时发生? 是否避免水面、玻璃、窗帘、植物产生不真实变形? 是否加入防止画面闪烁、物体变形、场景漂移的限制?
如果任何一项自检不通过,你需要在内部自动修改环境动态、运镜或画面用途,直到适合空镜图片转视频生成。
最终输出要求
:
根据每张空镜图的真实画面内容,自由组织视频提示词,不要固定使用同一个句式结构。 提示词可以根据画面情况调整顺序,可以先写运镜,也可以先写环境动态,也可以先写广告片用途,但必须包含:场景一致性、无人物要求、环境动态、具体运镜、广告片用途、风格质感和负面限制。 每张图片输出一段完整视频提示词,每段提示词是一整段自然语言,不要分点,不要标题,不要解释。
视频提示词需要尽量具体,避免空泛词。不要只写“环境自然变化”,要写清楚什么在动、怎么动、镜头如何运动、画面适合放在广告片哪个位置。
最终只输出空镜图片转视频提示词,不要输出任何分析、解释、自检内容、标题或额外说明。
倘若不想啥模型都开会员,可以使用Flow pix无限画布(https://www.flowpix.club/)平台,里面接入大部分热门模型nanobanan pro/seedance2.0/可灵 o3/ GPT image2.0 都有,刺猬星球会员享受75折
第五步是生成音乐
视频素材完成后,我把所有视频交给 Codex 分析,让它根据画面风格给出适合的背景音乐提示词。这支片子的画面是泳池、阳光、复古穿搭、彩色针织和多人模特,所以音乐方向更适合复古度假、轻快、带一点 soft funk 和 nu-disco 的质感。

音乐提示词如下:
创作一首适合高级时装品牌广告片的复古泳池度假风 BGM,时长约 40 秒,整体风格为 retro poolside nu-disco、soft funk、French Riviera lounge pop、70s resort disco。音乐要明亮、轻奢、阳光、有复古度假感,适合泳池、海边、黄色遮阳伞、彩色针织服装、复古墨镜、多人物时装广告画面。BPM 控制在 100-106 左右,节奏轻快但不要炸,鼓点清晰、有律动感,适合竖屏时装广告剪辑。配器包含干净的 disco drum groove、温暖的 funk bass、复古电钢琴、轻盈的 rhythm guitar、少量弦乐 stabs、柔和合成器 pad、细腻手拍或 shaker。前 0-6 秒是明亮轻盈的开场,有阳光和泳池边的度假氛围;6-16 秒鼓组和 bass 进入,形成轻快时装广告律动;16-26 秒加入更明显的 groove 和细节打击乐,适合服装局部、手部、墨镜、鞋履、衣摆等快切;26-34 秒情绪稍微抬高,加入复古弦乐或合成器点缀,适合多人互动和泳池边群像;34-40 秒自然收束,保留一个优雅尾音,适合品牌主视觉定格。音乐要高级、克制、时髦、干净,有夏日度假广告质感,不要 EDM,不要 trap,不要重低音轰炸,不要可爱儿童感,不要旅游 vlog 感,不要强烈歌词,不要说唱,不要摇滚失真,不要过度戏剧化,不要悲伤,不要阴暗。
拿到音乐提示词后,我去即梦 AI,用 SeedMusic 1.0 Preview 生成背景音乐。音乐不需要太复杂,关键是节奏清楚、氛围统一,适合后面做卡点剪辑。

第六步是剪映剪辑
最后把所有视频和音乐导入剪映。我采用的是背景音乐剪辑法,也就是先听音乐节奏,再根据鼓点和段落变化来安排镜头。

开头用强画面抓住注意力,中段穿插人物、服装细节和多人互动,后段用群像或主视觉镜头收束。剪辑时不需要把所有视频都用上,只选择最稳定、最有广告感的镜头。
设计上,我只加了几个高级字幕,再加一点颗粒质感。因为前面的场景、人物和色彩已经统一,所以不需要再大幅调色,直接导出即可。

如果换成其他主题,也可以沿用这个方法:先找核心参考,再统一场景和角色资产,然后生成分镜,最后用图生视频和音乐剪辑完成成片。真正重要的不是某一个工具,而是每一步都在控制一致性。这样做出来的视频,才不会像随机素材拼接,而会更接近一支完整的商业短片。
视频生成执行卡
把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。
这节课不是先追求炫技成片,而是围绕「用 AI 制作一支复古服装品牌短片:从参考图到成片剪辑」先把主体、动作、镜头和节奏稳住。
按原文节奏走最稳:先吃透「准备工具」,再把「第一步是找参考」定住,接着处理「第二步是整理资产」;最后用「第三步是生成分镜图」收口。
- 先把「准备工具」里的主体和动作定死。
- 围绕「第一步是找参考」只取局部结构,别整张照搬。
- 做完「第二步是整理资产」后,先查连贯性和穿帮。
- 先把「第三步是生成分镜图」里的主体和动作定死。
- 这一段重点看镜头和节奏,别急着炫技。
- 做完「第五步是生成音乐」后,先查连贯性和穿帮。
不要一上来就生成最终片;先拆镜头、定主体和运动,再逐段生成,否则容易跳轴、穿帮、节奏混乱。
检查主体是否稳定;镜头运动是否明确;前后画面是否连贯;节奏是否服务主题;是否有明显变形或穿帮。
请围绕「用 AI 制作一支复古服装品牌短片:从参考图到成片剪辑」帮我做一个可直接执行的方案。 我的目标是:【填写你的具体目标】 我的素材/产品/角色信息是:【填写已有素材和限制】 请输出:核心创意、分镜表、每个镜头的画面描述、视频生成提示词、剪辑顺序和成片自检清单。要求主体稳定、动作明确、镜头连贯。